37  课程综合实训项目

本章定位(必修收口):本章是完成必修主线(第1—29、33—36章)之后的整合性课程项目。它不设平台任务、不进入教学平台判定,也没有标准答案,鼓励多种解法与差异化选题;三条赛道任选其一,把必修环节训练出的清洗、聚合、可视化与结论能力整合成一份完整的分析报告,作为 33 个必修实训章节之外的综合项目收口。

37.1 项目目标

完成本项目后,你应能独立交付一份可复现的数据分析报告。自查清单:

37.2 可选赛道

三条赛道任选其一,选题确定后原则上不再更换。每条赛道给出业务场景、本地可运行的数据获取路径与核心研究问题;研究问题可在示例基础上自行细化,但难度不得低于示例。

37.2.1 赛道一:零售复购与销售结构(基于第 章节 22 章与第 章节 26 章同型数据思路)

业务场景:你是零售电商的数据分析实习生,管理层需要一份”销售结构 + 复购”诊断报告,用于决定下一季度的品类投入与促销预算分配。

数据获取路径(本地可运行,三选一):

  1. 公开数据集:Tableau 示例数据集 “Superstore”(零售订单明细,含订单日期、客户、品类、销售额、折扣、利润等字段,与第 章节 26 章平台数据同型),或 Kaggle 公开数据集 “Walmart Store Sales”(门店周度销售,与第 章节 22 章平台数据同型);
  2. 内联合成数据:参照第 章节 26 章本地演练版的做法,自建 200—500 行同结构合成订单表,并在报告中明确标注为合成数据、说明其局限;
  3. 在教学平台环境内完成时,可直接使用平台内置的 superstore.xlsx,但平台结果不用于本地复现。

核心研究问题(示例):

  • 品类结构:各品类/Sub-Category 的销售额与利润贡献是否匹配?哪些品类”增收不增利”?
  • 折扣与利润:折扣档位与利润的关系是否存在由正转负的拐点(参照第 章节 26 章的 Profit_p_p 口径与样本量过滤)?
  • 复购:头部客户/门店贡献了多少比例的销售额?客户购买的集中度如何?

37.2.2 赛道二:金融组合风险与相关性(基于第 章节 21 章、第 章节 34 章与第 章节 36 章思路)

业务场景:你为一只拟配置 3—6 只资产的小型组合撰写风险诊断简报,回答”这组资产放在一起,风险是被分散了还是被放大了”。

数据获取路径(本地可运行,三选一):

  1. OSS 直链:第 章节 36 章平台任务代码块内含两个可联网直读的 OSS 直链(黄金期货日线、美国十年期国债收益率日线,具体 URL 见该章平台原始代码块),本地可直接复现;
  2. 行情接口:参照第 章节 34 章,用 Tushare index_daily 接口获取 3—6 只指数的日线收盘价(需自备 token;接口权限不足时改用路径 1 或 3);
  3. 内联合成数据:构造 3—6 列、约 250 行的合成日收益率矩阵(如 np.random.multivariate_normal),仅用于演示组合方差与相关性的统计性质,报告中必须标注为合成数据。

核心研究问题(示例):

  • 相关性矩阵:以对数收益率计算相关系数矩阵,哪两类资产相关性最高/最低?与资产类别直觉是否一致?
  • 分散化效果:用 \(\sigma_p^2 = \sum_i \sum_j w_i w_j \sigma_i \sigma_j \rho_{ij}\) 计算等权组合方差,并与”各资产方差的平均”对比,量化分散化收益;
  • 相关性的稳定性:滚动窗口(如 60 日)相关性是否稳定?市场大幅波动期相关性是否上升(参照第 章节 34 章”相关性的不稳定性”)?

37.2.3 赛道三:跨境贸易结构分析(基于第 章节 25 章与第 章节 27 章思路)

业务场景:你为一家出口企业做贸易伙伴结构分析,回答”我们的出口/进口集中在哪些伙伴、这一结构在改善还是恶化”。

数据获取路径(本地可运行,三选一):

  1. 公开数据集:联合国商品贸易统计数据库 UN Comtrade(可下载按伙伴国分列的年度进出口额),或中国海关总署公开的月度进出口统计;
  2. 内联合成数据:参照第 章节 27 章本地演练版的做法,自建”国家×年份×贸易额”的内联合成长表(结构同第 章节 25 章的 sk2018-2010_export.csv),并标注为合成数据;
  3. 平台内置的 sk2018-2010_export.csv/sk2018-2010_import.csv 仅在教学平台环境可用,不用于本地复现。

核心研究问题(示例):

  • 伙伴集中度:CR3/CR5(前 3/前 5 大伙伴的出口额占比)在样本期内的变化趋势;
  • 伙伴类型区分:哪些伙伴稳步增长、哪些大起大落(参照第 章节 25 章的双向趋势对比与子图组织);
  • 进出口结构差异:同一伙伴在出口侧与进口侧的地位是否一致?顺差/逆差主要来自哪些伙伴?

37.3 交付物清单

一份可复现的项目材料包,最低要求:

  1. 数据质量说明与清洗日志:发现了哪些问题(缺失、重复、单位不一致、格式错误、逻辑错误)及各自的处置方式与处置量;
  2. 不少于 3 张图:每张图配一句结论——一句话说清这张图支持什么判断;图型选择需与问题匹配(参照第 章节 20 章的选型要点);
  3. 不少于 1 个分组聚合表:至少含一个比率型指标(占比、增长率或率指标),并写明分子分母口径;
  4. 约 300 字商业结论:含数据口径声明(数据来源、时间窗、样本范围)与局限说明(样本量、合成数据、“相关不等于因果”等)。

37.4 评分量表

评分维度 权重 评分要点
数据严谨 30% 清洗日志完整、口径声明清楚、无未说明的数据取舍
方法正确 30% 分组聚合与指标构造正确、比率分母合理、图型与问题匹配
图有效性与可读性 20% 每张图有一句结论、坐标轴/图例/单位完整、脱离正文可独立读懂
结论逻辑与商业价值 20% 结论有数据支撑、含局限说明、给出可执行的业务建议
合计 100% 四个维度独立打分后加权求和,得到总分

说明:四个评分维度的权重合计为 100%(30% + 30% + 20% + 20%);按百分制对各维度分别打分后加权汇总。

37.5 实施建议与学术诚信

节奏建议(2—4 周):

  • 第 1 周:选题与取数——确定赛道与研究问题,完成数据获取,写出数据质量说明初稿;
  • 第 2 周:清洗与探索——完成清洗日志、核心分组聚合表与图的初稿;
  • 第 3 周:成稿——补齐口径声明,撰写约 300 字商业结论,对照评分量表自评并修改;
  • 第 4 周(弹性):迭代——根据自评或同伴互评补做稳健性检验(如更换样本量过滤阈值、更换时间窗、更换口径重算)。

允许工具:Python 标准库与本书主线用到的 NumPy、Pandas、Matplotlib、Seaborn(建议在 peter 环境或自行安装的 Anaconda/Miniconda 环境中用 Jupyter 逐块运行);可查阅官方文档与本书各章内容;如使用 AI 辅助工具,须在报告中声明使用范围与方式。核心分析不得由他人代做。

独立完成声明:提交材料须附一句独立完成声明,例如:“本项目的数据获取、代码、图表与结论由本人独立完成,AI 工具仅用于 ____(如:语法查询/绘图美化),未复制他人成果。”使用合成数据、引用他人代码片段或任何外部资料,均须在报告中注明来源。

37.6 本章小结

本章是全书唯一的项目型章节:没有平台任务与标准答案,交付物清单替代练习题,评分量表替代平台判定,多条解法并存是常态而非例外。它检验的是必修主线 33 个实训章节训练出的完整能力链——提出业务问题、取数与清洗、正确聚合、有效可视化、有口径意识的商业结论。完成本章交付物,即完成本课程的收口。